Affine+ReLU6 融合：一次内核完成仿射与 ReLU6（0..6）裁剪，减少内核与显存往返。

torchcode.py：参考实现 `y = clamp(x * scale + bias, 0, 6)`。
cudacode.py：`__global__ void affine_relu6_kernel(...)` 完成融合计算。
run_code.py：比较精度与性能（100 次迭代，`rtol=1e-03`）。
